KV Cache
Key-Value Cache (鍵值快取)
定義
- 鍵值快取:是大型語言模型在推論時,把前文 Token 的中間運算結果暫存起來,避免每次生成新 Token 都從頭重算。
核心概念
- 降低重複計算:前文已經算過的結果可以直接重複使用。
- 提升推論效率:以額外的記憶體空間換取更快的生成速度。
- Context 越長,KV Cache 越大:需要保留的前文越多,占用的記憶體也越多。
硬體脈絡
- 高熱度資料優先放在高速記憶體:KV Cache 通常優先放在 HBM 等高速記憶體,以降低資料存取延遲。
- 容量不足可逐層卸載:當高速記憶體容量不足時,可將部分 KV Cache 移至 DRAM 或 更低階儲存。
- 記憶體成本增加:KV Cache 越大,對 HBM 容量、記憶體頻寬、整體系統架構 的成本壓力越高。
股癌脈絡
-
市場誤解:節目認為 Google 的 KV Cache 壓縮技術被市場過度解讀成記憶體需求消失,因此可能造成相關標的錯殺。
- 反向邏輯:即使單位推論需要的記憶體下降,效率提升也可能刺激更多 AI 應用、使用量,使總需求增加,符合傑文斯悖論的思考框架。
- 投資重點:要分辨技術進步壓縮的是單位資源需求,還是整體市場需求,兩者對記憶體產業的影響不同。
留言
留言載入中…